MedResearchBench: A Multi-Domain Benchmark for Evaluating AI Research Agents on Clinical Medical Research
本論文は、既存のベンチマークが医療臨床研究の複雑な要件を考慮していないという課題を解決するため、NHANES や SEER などの公開データと高品質な論文のグランドトゥルースに基づき、統計手法から臨床解釈まで 6 つの医療固有の次元で AI 研究エージェントを評価する初のベンチマーク「MedResearchBench」を提案し、その有効性を実証したものです。